融合算子：Cos-Affine-Gate（一次核内完成仿射与余弦门控，直接返回 y = x * cos(α*z + β)，其中 z = x*scale + bias）。该设计通过融合计算减少显存往返与内核启动，适合需要相位敏感的按维门控场景。

目标与定义
- 输入张量：`x[B, D]`
- 逐维参数：`scale[D]`、`bias[D]`
- 标量超参：`alpha`、`beta`
- 计算流程：`z = x*scale + bias`，`g = cos(alpha*z + beta)`，`y = x * g`

参考实现（文件要求）
- `torchcode.py`：提供 PyTorch 参考 `Model`，实现上述公式，`get_inputs()` 生成 `x[B,D]`，`get_init_inputs()` 生成 `scale[D]、bias[D]、alpha、beta`
- `cudacode.py`：使用 `load_inline` 嵌入 CUDA，实现单核融合（一次遍历完成仿射+cos 门控+乘法），`-O3 --use_fast_math`
- `run_code.py`：100 次迭代统计平均耗时；精度判定：`torch.allclose(..., rtol=1e-03, atol=1e-06)`；输出加速比

CUDA 实现要点
- 并行策略：`grid = B`（一行一个 block），块内沿 D 做连续访存；保证同一行数据局部性
- 对齐向量化：在 `x/scale/bias/y` 都 16 字节对齐且 `D%4==0` 时走 `float4` 路径；否则安全回退标量路径
- 指令级优化：仿射用 `fmaf` 合并乘加；三角函数走 `--use_fast_math`；循环 `#pragma unroll 4`
- 访存模式：读取 `x、scale、bias`，直接写 `y`；仅一次全行遍历，无额外中间缓冲
- 线程配置：推荐 `block=1024` 起步；根据设备与 D 尺度可微调至 `256/512/1024`

评估与目标
- 精度：与 PyTorch 参考在 `rtol=1e-03, atol=1e-06` 范围内对齐
- 性能：在常见 `B=16, D=16384` 规模下，期望 ≥1.0x 加速；更大 B/D 通常加速更显著

加分项（可选）
- 针对未对齐场景，减少分支开销与循环尾处理的代价
- 根据设备 SM 架构试探最佳 `block`，并在 `D` 很大时考虑每线程处理多个元素的批量步长

